🚫Что делать с пропущенными значениями перед нормализацией или стандартизацией признаков
Пропущенные значения (NaN, пустые ячейки) затрудняют масштабирование данных, потому что статистики вроде среднего, стандартного отклонения или минимума становятся некорректными. Поэтому пропуски нужно обработать до нормализации.
— Простые методы: среднее, медиана, мода. — Продвинутые: KNN, модели на деревьях, многократная импутация (Multiple Imputation).
2️⃣Удаление строк с пропусками
— Допустимо, если доля пропущенных значений очень мала.
3️⃣Использование моделей, устойчивых к пропускам
— Некоторые алгоритмы (например, XGBoost, CatBoost) умеют обрабатывать пропуски без предварительной импутации.
📌Вывод
— Пропуски надо обрабатывать до масштабирования. — Лучший подход — импутация на обучении, затем масштабирование по тем же правилам. — Не смешивайте статистики между train и test — это критично для честной оценки модели.
🚫Что делать с пропущенными значениями перед нормализацией или стандартизацией признаков
Пропущенные значения (NaN, пустые ячейки) затрудняют масштабирование данных, потому что статистики вроде среднего, стандартного отклонения или минимума становятся некорректными. Поэтому пропуски нужно обработать до нормализации.
— Простые методы: среднее, медиана, мода. — Продвинутые: KNN, модели на деревьях, многократная импутация (Multiple Imputation).
2️⃣Удаление строк с пропусками
— Допустимо, если доля пропущенных значений очень мала.
3️⃣Использование моделей, устойчивых к пропускам
— Некоторые алгоритмы (например, XGBoost, CatBoost) умеют обрабатывать пропуски без предварительной импутации.
📌Вывод
— Пропуски надо обрабатывать до масштабирования. — Лучший подход — импутация на обучении, затем масштабирование по тем же правилам. — Не смешивайте статистики между train и test — это критично для честной оценки модели.
The global forecast for the Asian markets is murky following recent volatility, with crude oil prices providing support in what has been an otherwise tough month. The European markets were down and the U.S. bourses were mixed and flat and the Asian markets figure to split the difference.The TSE finished modestly lower on Friday following losses from the financial shares and property stocks.For the day, the index sank 15.09 points or 0.49 percent to finish at 3,061.35 after trading between 3,057.84 and 3,089.78. Volume was 1.39 billion shares worth 1.30 billion Singapore dollars. There were 285 decliners and 184 gainers.
Библиотека собеса по Data Science | вопросы с собеседований from tw